🏠 返回首页
📚 全书 19 章 · 114 课时精读提炼

Hermes 与 Agent 工程实践 · 知识笔记

KNOWLEDGE NOTES & LEARNING ROADMAP

把 114 课时浓缩成"一本你能带走的方法论":从会用 Hermes会做业务壳用 SDD 工程化落地,最后读架构内化。 文末附高效学习方法与分阶段学习路径。

⚡ 超级个人助理🐚 Shell Engineering📐 SDD · Spec Kit 🎬 映画系统💊 胶囊知识库🦅 猎鹰热点
19章节
114课时
4骨架支柱
3产品级项目
5壳的形态
7SDD 步骤
BOOK MAP

先看清全貌:这本书让你变成什么样的人不是"教你用一个小工具",而是给你一套"由 AI 接管个人与业务软件事务"的心智模型 + 工程方法论

🧭本书四大骨架支柱

支柱核心价值章节
🧑‍💼 超级个人助理30+ 案例让你"会用"Hermes,接管全部软件事务第1–8章
🐚 Shell Engineering在现成超级 Agent 上"套业务壳",不从头造 Agent第9、11章
📐 SDD + Spec Kit用可检查的规范驱动开发,工程化落地产品第12–15章
🧠 Hermes 架构剖析学习优秀记忆/网关设计,内化为自己的能力第18章

🎯三个产品级落地项目

每一个都不是 Demo,而是能提升生产力的产品,用来把 Shell + SDD 方法论真正跑通:

🎬 映画系统 —— 从一份文字稿到成品 mp4
💊 胶囊知识库 —— 让收藏的知识真正进入思考
🦅 猎鹰热点追踪 —— 附带 Web 网站的生产级应用

🚫 不教什么:不教你从零写推理/记忆/工具调用——95%+ 开发者不该重复造一个不如现成品的"大脑"。

🔑 全书阅读主线(建议按此逻辑读,而非逐课时硬啃)
会用 Hermes 接入+装技能+案例 Shell 造业务壳 SDD 工程化 读架构内化

第1–8章"会用",第9/11章"会造",第12–15章"会做对",第10章胶囊系统是承上启下的真实项目,第16–18章是拓展。

THE SOUL

先读这页:全书的"魂"动手前请先记住序章第3节那句全书最重要的话

"Hermes 就是牛马。你有任何繁琐的软件类操作,都应该交给它做——记住是'任何'。不要纠结'是我做还是它做',直接让它去尝试。即使它一时做不了,从和它的对话里你也能学到很多。"
《Hermes 与 Agent 工程实践 · 第0章 你必须看的一节,很重要》

💡效率差异的本质:不是技巧,是"想象力"

很多人对 Agent 利用率极低,不是不会技巧,而是"想不到"让它去做。培养方法:每晚花 10 分钟复盘当天工作,凡是自己查资料后手工完成的软件类操作,本应都能甩给 Agent。把"委托意识"练出来,这本书就值回票价。

🎓为什么教材采用"多模态"

AI 时代技术更新太快、理论需讲透,视频"录制即过时"、难检索、无法喂给 AI 做知识库。因此采用文字为主、视频为辅:理论文字讲透、实操视频演示、图片练习巩固——呼应"用 AI 学 AI"理念。

PHASE I · GET STARTED · 会用

会用:认识、配置与基础操作把 Hermes 真正跑起来、能"把话说清楚并控制住它"——这是所有进阶的地基

CH.1

认识 Hermes · 上手与配置AI Agent 是什么 · 安装 · 多模型看图 · 推理 · 排查

Hermes 是开源(MIT)、可自托管的通用 Agent 框架,最大特色是"学习循环 + 四层记忆",让一个 Agent 从工具集合体进化成你的个人助理。
  • AI Agent 的本质:不是"回答问题",而是"完成工作"。相比聊天工具多了四项核心能力——自主规划、工具调用、多步执行与自我修正、跨会话持久记忆。Agent 分三类:代码 Agent(Claude Code)、通用 Agent(Hermes)、垂直领域 Agent。
  • Hermes 定位:Nous Research 发布。最大特色是 Closed Learning Loop——任务后自动反思,把经验沉淀为 ~/.hermes/skills/ 下的 SKILL.md,由 GEPA 进化引擎迭代自己的技能。支持四层记忆、40+ 内置工具、200+ 模型、15+ 消息平台。
  • 安装:macOS/Linux curl ...install.sh | bash;Windows 原生 iex (irm ...install.ps1) 或 WSL2;另有 Desktop 与 Web Dashboard(hermes dashboard)。⚠️首配建议选 "Blank Slate"
  • 多模型 / 让 Hermes 看图:主模型用 DeepSeek(便宜无视觉)+辅助视觉模型(如 Qwen),配 image_input_mode:auto+auxiliary.vision;本地 OCR 用 RapidOCR 可省 token。
  • 推理与排查/reasoning show 需先开流式输出,深度 none→xhigh;hermes doctor 自检 / hermes update⚠️ API Key 只显示一次及时复制;删除类任务先扫描确认给足边界。
CH.2

Hermes 基础操作 · 把话说清楚并控制它指令写法 · 中断/接管/回滚 · 网页抓取 · 浏览器自动化

对 Agent 说话,技巧就一个字:"讲清楚"。给足目标、范围、约束、验收,你就赢了 80% 的用户。
  • 指令四要素目标(动词具体)·范围(在哪/哪段)·约束(不碰什么)·验收(怎么算做完——最易漏)。大文件用 @./file,长文本 Option+Enter 换行。
  • 中断/接管/回滚Ctrl+C 强制中断。三种忙时模式 /busy <interrupt|queue|steer>——纠偏用 interrupt、防忘事用 queue、轻量微调用 steer(最常用)。/background 开独立后台会话。
  • 检查点回滚:默认关,需 hermes chat --checkpoints 或 config 开 checkpoints.enabled/rollback [n]⚠️curl/kill/git push/rm -rf 不可撤销。
  • 网页抓取:走"无障碍树"而非死 CSS 选择器——LLM 读角色文本定位字段,抗改版、无需视觉模型,代价是慢、耗 token。
  • 浏览器自动化:底层 CDP 连 Chromium,三模式——无头/有头/Browser Connect(/browser connect,复用登录态,推荐)。
  • 实战心法:批量 WebP 压图、抓 GitHub Trending 出报告、价格监控+自动加购——但在"加购后停手"⚠️自动付款风险高。
CH.3

多渠道接入 · 让助理随时在线消息网关 · 接微信/飞书 · 配对 · 备忘录落地

让 Hermes 从"只在电脑前能用"变成"随身助理":手机做消息入口,PC 常驻干活。
  • 消息网关(gateway):常驻后台"收发室",主动向平台建 WebSocket 长连接——无需公网 IP/内网穿透,PC 开机且网关运行即可。
  • 微信接入:走腾讯 iLink Bot 接口,身份是 bot,不能进普通群、不能转发,仅 1v1 私聊——正适合作个人助理。
  • 飞书接入hermes setup gateway→选 Feishu→浏览器授权(自动建应用/配权限/订阅事件)→装后台;群聊需 @ 才响应。
  • 配对 & Home Channel:陌生用户返回配对码,主人 hermes pairing approve <平台> <码>/sethome 设默认投递地址收定时任务/通知。
  • 落地案例:一句话让飞书 Hermes 做"备忘录"——本质是写一条 Memory + 用自带工具操作一个 Markdown/JSON 文件(无代码无数据库);要精确触发就沉淀成 Skill(加 category/remind_at 字段、注册 cron 到点推送)。思路比代码重要
CH.4

让 Hermes 更懂你 · 人格+记忆+上下文SOUL.md · MEMORY/USER · 会话压缩与检索

给它一个"灵魂"(SOUL)、一份"记忆"(MEMORY/USER)和恰当的上下文管理,它就从标准客服变成懂你的搭档。
  • SOUL.md(~/.hermes/SOUL.md):持久人格文件,定义腔调与行为规则,每次新会话都重读。可写文风(如鲁迅+王小波)+行为准则。⚠️风格是调味不是主菜,别写太用力失真。
  • MEMORY.md / USER.md(~/.hermes/memories/):Hermes 自动维护的持久记忆——MEMORY 记环境/约定/经验,USER 记用户画像与偏好;会主动记、也会跳过琐碎/可搜索/原始数据。
  • 三层记忆:持久记忆(SOUL+MEMORY+USER,每次必加载)→技能层(条件触发)→会话检索层(state.db 的 FTS5 全文索引,按需搜索)。
  • 会话压缩:上下文满用摘要替代早期对话,保留系统提示词+最近几轮;自动阈值默认 50%,可 /compress 手动。
  • 命令hermes -c "标题"(按标题恢复)/sessions list|prune⚠️记忆是启动快照,会话内改动要新开会话才生效;重要内容务必会话结束前让它写进 MEMORY.md。
PHASE II · EXTEND & PRACTICE · 让助理变专家

技能、案例与自定义Skill 是 Hermes 进化的燃料;这些案例是"委托意识"最好的演练场

CH.5

技能 Skill · 加装新能力Skill 的本质与层级 · 必装扩展 · 搜索 · Token 管理

  • Skill 的本质:把"任务流程+规则+代码"封装成可复用单元。目录含 SKILL.md(name/description/触发条件)+reference.md(细节)+scripts/(工具)。让 Hermes 从"通用助理"变"领域专家"。
  • 三层位置:默认(core,预装)/全局(~/.hermes/skills,跨项目)/项目(仅该项目加载)。⚠️新技能放项目级或全局,别放默认目录(升级会覆盖)。
  • Skill 进化:Hermes 用 GEPA 引擎自主改进技能。好 Skill:目标明确、结构清晰可扩展、有限范围、含触发词、能自测、文档全。
  • 必装扩展:OCR、思维导图(md→mm)、图表/数据分析、网络查询(Agent Reach)、安全扫描、浏览器自动化。Hermes 默认不联网搜索,需装 Reach 类能力
  • Token 管理Tokscale(实时按 model/skill 显示用量) 与 RTK(精简指令 Reduce Token)——去长示例删冗余可降耗 20–30%。
  • 其他能力:KAMI 美学设计;Hermes 可直接产出精美 HTML 幻灯片(非传统 pptx)。
CH.6

丰富案例 · 把"任何琐事都交给它"落到实处Computer Use · 视频下载/字幕/GIF · 监控器 · goal 模式

  • Computer Use(桌面控制):Hermes 用 Playwright + CDP(非虚拟鼠标)控制 Chromium 完成网页自动化——可靠不挡屏、可截图调试。三步:思考→截图→操作。
  • 抓视频(抖音/B站):基础用 yt-dlp;复杂/需登录/高清晰度,用 CDP 监听网络请求拿真实视频 URL 下载——更稳、还能抓封面描述。⚠️B 站需先登录拿 cookie。
  • 字幕提取:纯音频转文字(Whisper 本地 / faster-whisper 更省显存);硬字幕需 OCR。
  • UP 主监控器:多平台爬数据、存本地、定期汇总报告——先手动验证流程→再自动化
  • goal 模式:不设死步骤,只给总目标(+示例/验收),让 Agent 自主规划跑完全程——适合流程不确定/想让它自动迭代的任务。
  • 多 Profile 干净测试环境:每 Profile 独立 config/skills/memories,隔离模型偏好,做 A/B 对比或干净复现。
CH.7

自定义你的 Agent · 从 CLI 到垂直系统治臭毛病 · 交互三次进化 · yt-dlp/CDP · 飞书 CLI

  • 治"臭毛病":先分析是模型(换更强)/Agent(缺工具)/方法论(Skill 缺规则/缺依赖检测/未拆步);把对大 Agent 的诉求下沉为小 Skill 或专项工具更划算。
  • 交互三次进化:API→CLI→自然语言。CLI 最适合 Agent:结构化、可逐个调用、失败可见。接 CLI 三大收益:不占 token 且可控、权限最小化、自带审计日志。
  • 实战原则:先找现成 CLI,再考虑 yt-dlp/CDP/浏览器。如网易云音乐 CLI
  • yt-dlp vs CDP:yt-dlp 通用但重 JS/签名、易被反爬;CDP 拿真实直链更可靠但更"重"。复杂下载、尤其需登录的站无脑选 CDP
  • 飞书 CLI:装 feishu CLI→授权(open token)→Hermes 直接操作飞书。⚠️生产要分应用隔离权限、最小授权;CLI 不支持的操作及时反馈别瞎猜。
PHASE III · CORE METHODOLOGY · 造业务壳

🐚 Shell Engineering · 全书最值钱的方法论不从头造 Agent,而是给已够强的"超级 Agent"套一个业务壳,让它变成你专属的垂直系统

这是本书区别于网络零散资料的核心价值。理解它你就明白:Agent 时代大多数开发者该学的不是造大模型、也不是从零搭 Agent 框架,而是在现成超级 Agent 之上,快速把业务做起来

🔍 判断 SE 产物的唯一标准
把超级 Agent 拿掉,你的系统还能干活吗?
不能 = Shell Engineering 产物;只是少了"智能"还能跑 = 传统应用 + 一个 AI 功能。

三层智能体工程

业务壳 你要做的
Shell 层:你的数据结构 / 工作流规则 / 领域知识 / 存储方案 / 交互入口。最贴近业务、最需领域 know-how、最体现差异化。
超级 Agent 复用的内核
Agent 层:Hermes / Claude Code / ChatGPT——已具备"听懂人话、会用工具、自我纠错",替你处理推理、工具、记忆、规划。
裸模型 很少碰
Harness 层:LLM 本身 + 工具/安全/执行外壳。绝大多数开发者不需要在这一层工作。
SE · CH.9/11

Shell Engineering 核心要点为什么不该从头造 · 五种形态 · 代码骨架+Skill 灵魂 · 开发/运行阶段

  • 为什么不该从头造 Agent:做一个能用的 Agent 至少搞定模型接入/上下文/工具调用/错误重试/记忆/规划/输出解析/安全边界——全是与业务无关的基建,几周起步且大概率不如现成超级 Agent。类比:非 LLM 时代做网站,没人从 HTTP 协议写起,而是选 SpringBoot/Flask 做底座再写业务。
  • 成本差一个数量级:传统造 Agent 要数月+算力;套壳只需写 Skill/配置,把行业经验固化进壳里。稀缺的从来不是写代码,而是行业经验。
  • 五种交付形态(由轻到重)
    • ① 纯 Skill——交付=Skill 文件夹;⚠️依赖 Agent 能力、不可精确复现、难测试;
    • ② Skill+模板+生成物——约束输出格式(如固定结构报告);
    • ③ MCP Server+Skill——壳提供外部工具/数据(走 Model Context Protocol);
    • ④ 代码骨架+Skill(应用最广)——确定性逻辑下沉为代码,Skill 负责判断与编排;
    • ⑤ 完整应用+Skill——壳本身是产品,Agent 仅作内嵌能力(如猎鹰系统)。
  • 代码做骨架,Skill 做灵魂:纯 Skill 不稳(10 步每步 90% 成功累计仅约 35%)。把确定性、可验证操作下沉为 Python 代码,把理解、判断、编排留给 Skill 与 LLM——SE 工程铁律。
  • 开发阶段 vs 运行阶段:个人自用系统可不分;交付给他人的产品必须分——开发用强模型(Codex/Qoder)探索,运行用稳定开源模型(Hermes)保安全可控。
  • 从模糊想法到 Shell 项目:模糊想法 →(grill-me 拷问)→ 清晰需求 →(AI 生成+人审批)→ SPEC →(plan/tasks/implement)→ Shell 项目 →部署运行。项目宪章压在最上层长期约束。
  • OpenSpec(SPEC 的工程化管理):直接改主 SPEC 会失控,改用"主 SPEC+增量变更(changes/<name>/SPEC.md)",propose→review→apply→去重→锁版。
PHASE IV · SDD · 工程化落地

📐 SDD 工程化:Spec Kit 全流程有了方法论(做什么)之后,这部分教你"怎么把产品做对、做可控"——先用可检查的规范约束 Agent,再让它实现

AI 降低的是生成代码的成本,没有降低理解变更、验证行为、承担后果的成本。
《第12章 · 代码越来越容易写,为什么还需要软件工程》——全章题眼

🧠 为什么代码越容易写,越需要软件工程

软件工程的真正难点是管理变更——"项目每向前一步都可能改动已定的东西"。代码/聊天记录只答"现在怎么做"、难答"当初为什么"。Vibe Coding 让代码变便宜→变化更快→人更难以记忆系统为何变成今天这样。SPEC/宪章/测试/变更记录既给 Agent 可读的项目上下文,也给人留追责依据。按需取用,别照搬大公司流程

🧩 Spec Kit 是什么

SDD 的一种具体实现(GitHub 开源 github/spec-kit)。两套入口:全局 CLI specify init(生成 .specify/+.agents/skills/);Codex 里 $speckit-* 引用 Skill(⚠️Codex 用 $,国产 Agent 多用 /)。

Spec Kit 主流程(每步一个 Skill)

宪章
constitution
长期原则
specify
写 SPEC
clarify
消除歧义
plan
技术规划
tasks
拆任务*
implement
实现
converge
对照核对*

* tasks 可跳过;converge 不可省——保证代码真的满足 SPEC。项目级先 $speckit-constitution 定宪章(数据边界/技术限制/质量要求)。附加:analyze(一致性)/checklist(检查)/taskstoissues(任务→Issues)。

CH.13

需求简报与 SPEC · 把"要什么"讲清楚Brief vs SPEC · Backlog · 用户故事 · 人工审核

  • 需求简报(Brief) vs SPEC:Brief 答"用户为什么需要、背景、素材在哪"(输入收敛);SPEC 答"系统具体该做什么"(可检验契约)。分工明确,别混为一谈。
  • Backlog 收纳边界外需求:暂不做/边界外的先放进 Backlog,保留上下文但不阻塞主线。
  • 媒体资料收敛:把原始素材分类,明确哪些是"事实/证据"、哪些是"示例/参考",避免需求被素材绑架。
  • 用户故事切入作为<角色>,我希望<能力>,以便<价值>——一句话锚定一个可验收需求点。
  • 反复编辑 Brief:Brief 非一次成型,随澄清不断修订,先穷尽歧义再进 SPEC。
  • 人工审核双重职责:既审正确性(SPEC 是否符合真实意图),又审完整性(是否漏重要场景/边界),不能全甩给 AI。
CH.14

用 Spec Kit 制定开发计划SPEC→Plan · 技术边界 · 运行/开发态 · 交付

  • SPEC→Plan:SPEC 定"做什么",Plan 定"怎么做、可行性、技术边界"。产出 plan.md/research.md(可行性调研)/data-model.md/contracts//quickstart.md
  • 技术边界与调研:实现前先做飞书等外部依赖的可行性调研(接口/权限/坑),把风险提前暴露在写代码之前。
  • SE 项目运行结构:区分开发态(Codex 等强开发 Agent 写代码)与运行态(产品运行时主 Agent 处理真实输入)——工具/Skill/权限不同。
  • 交付方式:交付一套"文档+Skill+代码结构+验收说明";运行态用户不直接面对模型,而是面对封装好的业务壳。
  • 强模型 vs Tasks 取舍:复杂/模糊用强模型(Agent)更稳,机械/确定性拆解用 Tasks 更省;按任务性质分配。可交互推进,也可把完整 Planning Brief 一次性丢给强模型(Goal 模式交 Codex 实现)。
  • 实施报告与交付物:实现后产出实施报告(改了什么/测试结果/已知问题),与代码一起作为版本基线对象。
CH.15

人工测试后的再次开发 · 版本基线运行态/开发态边界 · 问题分类重入 SDD

第一版交付后真实问题才会暴露。用"版本基线"锁定 SPEC/Plan/代码/测试/实施报告的对应关系,并在运行态与开发态之间划界。
  • 按阶段处理问题:开发环境可立即改;验收环境先记缺陷停止验收、修复后新候选版本重验;正式环境绝不在用户任务中临时改代码
  • 版本基线:不阻止变更,只规定"无记录不得改对应关系"。受控路径:V1→记录问题复现→判断类型→改相应层→局部+全量回归→V1.0.1→重验。
  • 问题分类重入 SDD:实现缺陷→补样例改代码测试;需求遗漏→补 SPEC/Plan;技术方案→改 research/Plan;新功能→新建需求变更+SPEC。
  • Agent 边界铁律:运行态发现问题→记录并报告、不改产品代码;开发态→依缺陷记录改代码测试成新版本。⚠️改代码后原"全量测试通过"结论即失效,须重跑全量回归。
SHOWCASES · 落地项目

三个产品级项目 · 把方法论变成真实系统映画系统(文→视频) · 胶囊知识库 · 猎鹰热点追踪

🎬

第8章 · 映画系统:从文字稿到成品视频

一套"半自动"视频生产 Skill(logamee-auto-video)。先读懂内容,再据内容设计画面——通用"文字→分镜→合成"工具只是堆砌文字,无法承担知识的"解释"。
  • Skill 集中存储+软链接:把分散 Skill 收敛到 ~/my-skills/ 一份,用 ln -s 软链到各 Agent,Git 托管可回滚。⚠️只链需要的,全链增负担。
  • 主流程(每层只做一件事、留下明确文件产物):环境自检→存原稿→理解原文→提取主题→设计分镜(storyboard.md)→冻结→生成 HTML(deck.html)→字幕预览(估语速)→生成音频(记真实时长)→校准字幕→后台渲染合成 mp4。
  • 声音克隆:几亿~十几亿参数,普通显卡本地可部署(IndexTTS2 6GB / CosyVoice2 8GB / Fish Speech 4GB),免按字收费的商用 API。
  • ⚠️创造类任务无法全自动:理解原文、分镜、HTML 画面、音频试听、成片核对都要人工介入。
💊

第10章 · 胶囊系统:让知识真正进入你的思考

Shell Engineering 的第一个真实落地(个人知识管理系统),也是全书方法论承上启下的项目。核心命题:收藏 ≠ 理解——知识要从"存档"变成"活的理解"。
  • 六层设计(入口→主题演化):来源 Source → 输入媒体 Media → 概念 Concept → 主题 Topic → 知识页 Page → 内化层 Internalize。
  • 三类知识页概念页(这是什么)/主题页(一组概念的组织论述)/综合回答页(针对问题综合多来源作答,多数提问可命中)。
  • 设计哲学"先主题,后 Wiki"、"融合而非追加"——把新知识融进已有理解,而非简单叠放,据此决定新建或并入,避免碎片化;证据留存——每条断言可回溯来源,防失真。
  • Karpathy 从 RAG 到 LLM-Wiki:单纯 RAG(检索拼装)有天花板,把知识组织成 Wiki/主题结构、让 LLM 基于结构化理解推理,是知识库更高级的形态。
  • 系统设计:"飞书负责存,Hermes 负责理解"——飞书(多维表格/知识库)做可靠存储检索底座,Hermes(超级 Agent)做判断综合与内化:正是"业务壳+超级 Agent"分工的体现。
🦅

第16–18章 · 猎鹰系统与架构学习(研读提纲)

⚠️据内容说明,第16–18章在平台目前"仅有内容说明、正文待开发"。此处按官方说明整理为研读提纲,供正文上线后对照学习。
  • 第16章 猎鹰热点追踪系统:更复杂的 SE 项目,属 Shell Engineering 第五种形态(附带网站的超级应用)。方向:多阶段自动化流程、调度/监控/报警工程化、把 Agent 能力包装成用户可用产品(采集→分析→生成报告→Web 展示)。
  • 第17章 实战猎鹰全流程:从零构建一个"附带 Web 网站"的生产级 Agent 超级应用(初始化/目录/模块/Skill 封装/前端)。想学第五种形态完整工程实践重点跟这章
  • 第18章 Hermes 架构学习:Hermes 为何这么智能——拟讲记忆循环系统、网关系统、技能系统、Profile 机制、推理模式实现。目标:把这些架构思想用进你自己的 Agent。
  • 📎 videos.md:9 段视频(id25–33)全部集中在第0/1/2/3/5/6/7/8章的实操案例,第15–18章无视频,与"正文待开发"一致。
HOW TO LEARN

高效学习方法(学习心法)这本书有 114 课时,方法比蛮力更重要

💡 心法一 · 先立"委托意识"

全书总开关是那句"Hermes 就是牛马"。与其背命令,不如先养成每晚复盘、软件类繁琐操作一律先交给 Agent 的习惯。技巧边用边学,意识不建立则全书白读。

🎬 心法二 · 多用"多模态"学习

本书"文字为主、视频为辅"。每节:①先读文字懂"为什么";②动手步骤亲手敲一遍;③合上,用自己的话复述要点——能讲清才算会。

🧩 心法三 · 跟着真实任务走

案例都来自真实需求。学完第1-2章就真让 Hermes 干一件手上的琐事;学完 Spec Kit 就用它重构一个手头小项目。知识在"用"中才生根。

🧑‍🏫 心法四 · 用好"追问式阅读"

Agent 能做私人助教。读不懂(如 Shell 的某种形态)就把困惑丢给 Hermes,让它用例子讲透、扮演作者不同角度解释——正好呼应本书理念用 AI 学 AI

🗺️ 心法五 · 先广度再深度,分两遍读

第一遍(广度):快扫 19 章只为建立"这书能做什么"的地图;第二遍(深度):按下方学习路径逐块精读+实操,重点攻克 Shell 与 SDD。

✂️ 可跳过/简化

第16-18章正文待开发可只看提纲;第5-8章大量案例按兴趣选做即可,不必全做——主线永远在第9/11/12-15章。

LEARNING ROADMAP

高效学习路径(分五阶段)不必按 114 课时顺序死磕——按"会用→会接→会造壳→会工程化"递进,砍掉重复、抓住主线效率最高

🟢

第一阶段 · 建立心智模型精读第0章 · 约半天

约半天
  • 精读第0章(序+必须看的一节),理解:为什么不从头造 Agent、什么叫"任何繁琐操作都交给它"。
  • 浏览整本书目录 + index.html,把"四大骨架+三个项目"的地图刻进脑子。
✅ 产出:一句话能说清"这本书让我变成什么样的人"。
🔵

第二阶段 · 能上手用第1、2章必读 · 约1–2天

约1–2天
  • 第1章:装好 Hermes,配好多模型(含能"看图"的视觉模型+OCR),开启推理模式。
  • 第2章:掌握"指令写法/中断·接管·回滚",把网页抓取、浏览器自动化玩一遍。
  • ⚡ 学完立刻做真实琐事(整理桌面、清理电脑、批量压图、抓网页出报告)。
✅ 产出:Hermes 已成为日常助理,你会排查不怕它出错。
🟠

第三阶段 · 接入生活圈与业务壳第3–8章 · 按需选做约2–3天

约2–3天
  • 第3章 多端接入:接微信/飞书→助理随时可用。
  • 第4章 人格与记忆:写 SOUL.md(风格)+看懂 MEMORY/USER(记忆)→让助理"懂你"。
  • 第5章 技能扩展:装必装技能(OCR/Agent Reach/HTML做PPT/KAMI),学会 Token 管理(Tokscale/RTK)省钱。
  • 第6–8章 案例与自定义:做感兴趣实战(视频下载/字幕/GIF/监控UP主/飞书知识库),理解 goal 模式与多 Profile——为"造壳"打样。
🔴

第四阶段 · 核心方法论攻坚(最值钱)第9、11–15章 · 约1周+,务必放慢动手做项目

约1周+
  • 第9章+第11章:吃透 Shell Engineering——判断标准、五种形态、开发/运行分离、"代码做骨架Skill做灵魂"、grill-me 拷问需求。
  • 第12–15章:用 Spec Kit 亲历 SDD 全流程 constitution→specify→clarify→plan→tasks→implement→converge;理解需求简报/Backlog/用户故事/表达边界与 Plan 技术边界调研。
  • 第15章:学会版本基线、问题分类重入 SDD、运行态与开发态边界
  • 回看第10章"胶囊系统":把方法论落到真实项目,理解"飞书存+Hermes 理解"系统设计。
✅ 产出:你能把 SDD 流程固化成自己的项目习惯,独立从模糊想法交付一个 Shell 项目。
🟣

第五阶段 · 可选拓展第16–18章 · 按需

按需
  • 第16–18章:猎鹰热点追踪系统 + Hermes 架构学习(记忆/网关/技能/Profile/推理)——用于内化优秀工程经验。
  • 反复阅读第9/11/12–15章,把 SDD 固化成本能。
💡 一句话路线图
先"会用"(1-2章)→按需"接入/装技能/做案例"(3-8章)→集中火力攻克 Shell+SDD(9、11-15章)→回看"胶囊项目"融会贯通(10章)→拓展架构与猎鹰(16-18章)。